> grep -r "local LLM"▋
8 articles
2026-10-06
llama.cpp vs Ollama — lequel devriez-vous lancer ?
Le dossier public, lu pas exécuté : Ollama fige son moteur llama.cpp en b11351 quand l'amont livre b11443. L'un est un appareil, l'autre la salle moteur.
2026-10-02
Calculatrice VRAM GGUF : vérifiez avant de télécharger
Taille du modèle, quant et contexte en entrée — poids, cache KV et verdict par carte en sortie. La calculatrice VRAM GGUF répond avant le téléchargement.
2026-09-23
vLLM peut-il lire du GGUF ? Oui — GPU uniquement
vLLM peut-il exécuter du GGUF ? Oui — via le plugin officiel, sur GPU uniquement. La syntaxe serve, le piège du tokenizer, les limites matérielles, et quand llama.cpp gagne.
2026-09-13
Quantification GGUF : Q4_K_M vs Q8_0, taille et VRAM
Niveaux de quantification GGUF comparés : Q4_K_M vs Q8_0 en taille, VRAM et qualité, et la règle — Q4_K_M par défaut, on monte seulement pour le code.
2026-09-10
llama.cpp vs Ollama : lequel utiliser en 2026 ?
llama.cpp vs Ollama : Ollama emballe llama.cpp pour le confort, le llama.cpp brut gagne en vitesse et en contrôle. Benchmarks, flags GPU, cas d'usage gagnants.
2026-09-07
Lancer un modèle GGUF en local : Ollama, llama.cpp & vLLM
Comment exécuter des modèles GGUF en local : pull Ollama en une ligne, llama.cpp direct depuis une URL Hugging Face, et le bon quant selon ta VRAM.
2026-09-04
Meilleur LLM local pour coder : de 8 à 24 Go de VRAM
Le meilleur LLM local pour coder par tranche de VRAM : Qwen3 Coder vs DeepSeek à 8, 12, 16 et 24 Go, le bon quant par carte et un setup Ollama prêt à l'emploi.
2026-09-01
Ollama vs LM Studio : quel outil LLM local choisir ?
Ollama vs LM Studio pour le vrai travail de dev : installation, GPU, vitesse et API locale — avec des commandes prêtes à l'emploi pour choisir aujourd'hui.